融合算子：Atan-Sigmoid-Mix-Gate（一次核内完成仿射与反正切混合门控，返回 y = x * σ(α * atan(z) + β)，其中 z = x*scale + bias）。atan 在大幅值区间趋于常数，有利于抑制过大输入的门控强度。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`g = sigmoid(alpha*atan(z) + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：PyTorch 参考 `Model`；统一接口
- `cudacode.py`：单核融合（仿射+atan+sigmoid+乘法）；`-O3 --use_fast_math`
- `run_code.py`：100 次迭代；精度 `rtol=1e-03, atol=1e-06`；打印加速比

CUDA 实现要点
- 行并行：`grid = B`；块内沿 D 连续访存；一次遍历写回
- 对齐向量化：16 字节对齐且 `D%4==0` 走 `float4`，否则标量回退
- 指令优化：仿射用 `fmaf`；`atanf` 与 `expf` 走快速数学；循环 `#pragma unroll 4`
- 线程配置：`block=1024` 起步，按设备试探最佳

评估与目标
- 精度：满足 `rtol=1e-03, atol=1e-06`
- 性能：≥1.0x 加速，向量化与融合带来优势

加分项（可选）
- 尾元素处理与分支收敛优化
- 根据分布特性调参 `alpha/beta` 增强门控稳定性（参考实现一致性优先）

